Aggregate benchmark scores obscure patient safety implications of errors across frontier language models
Lo studio dimostra che i punteggi aggregati dei benchmark nascondono differenze clinicamente significative nella sicurezza dei modelli linguistici avanzati, poiché la variabilità negli errori di triage, nei bias contestuali e nella gestione delle crisi non è correlata all'accuratezza complessiva.